Type: entity
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: papermultimodalCLIP机器学习

Learning Transferable Visual Models From Natural Language Supervision (2021 论文)

概述

提出 CLIP 模型的论文,通过对比语言-图像预训练实现零样本视觉理解。

关键内容

  1. 对比学习:训练图像和文本编码器,使匹配的图文对在嵌入空间中靠近,不匹配的远离。
  2. 零样本迁移:CLIP 可以在未见过的类别上进行零样本分类,只需提供类别名称的文本描述。
  3. 多模态对齐:建立了文本和视觉的统一表示空间,为 DALL-E 等文生图模型奠定基础。

来源

相关